메뉴

#객체 탐지

HN
Hacker News • 40일 전
IMP 7

GPT-5.6 Sol, 오픈AI 역대 최고의 비전 모델로 등장

OpenAI가 GPT-5.6 라인업(Sol, Terra, Luna)을 공개했고, Roboflow의 비전 벤치마크에서 Sol은 객체 탐지 mAP@50 13.8에서 46.2로 비약적으로 향상되며 오픈AI 역대 최고의 비전 모델로 평가받았습니다. 특히 문서 레이아웃 탐지와 밀집된 장면에서 강점을 보였으나, 2000x2000 픽셀 이상 큰 이미지에서는 좌표가 불안정해지는 한계가 있어 리사이징·크롭이 권장됩니다.

GPT-5.6 OpenAI 비전 모델
TD
The Decoder • 104일 전
IMP 8

단일 텍스트 명령으로 모든 이미지 속 객체 수를 세는 AI 'Count Anything'

중국 칭화대 등 연구진이 메타(Meta)의 비전 모델(SAM3)을 기반으로 텍스트 프롬프트 하나만으로 위성 사진, 의료 스캔, 일상 사진 등 모든 이미지 내 객체의 수를 정확히 세고 표시하는 새로운 AI 모델 'Count Anything'을 발표했습니다. 이 시스템은 큰 객체는 박스로, 작고 밀집된 객체는 점으로 표시한 뒤 병합해 중복 계산을 방지하는 하이브리드 방식을 사용하여 기존 경쟁 모델들을 크게 압도하는 성능을 보여줍니다. 텍스트 기반 객체 카운팅을 위해 구축된 역대 최대 규모의 데이터셋을 학습한 이 모델은 의료, 농업, 도시 계획 등 다양한 실무 분야에서 활용도가 높을 것으로 기대됩니다.

객체 탐지 비전 AI 멀티모달